高性能计算

WebGPU 计算着色器矩阵乘法优化:从 Naive 到 Tiled 深度实战

深入剖析 WebGPU 计算着色器实现高效矩阵乘法的完整管线:从朴素实现到 Tiled 分块策略、Workgroup Memory 利用、寄存器分块优化,包含完整 WGSL 代码、JavaScript 端管线配置、性能基准测试数据(Apple M2 Pro 实测),以及工程实践建议(TILE_SIZE 选择、Bank Conflict 避免、timestamp-query 精确计时等)。

Rust + CUDA IPC:多 GPU 间零拷贝张量通信工程实战

大规模 AI 模型训练与推理离不开多 GPU 协作。本文深入讲解 CUDA IPC 机制如何实现在同一节点内多 GPU 间零拷贝张量传递,并通过 Rust FFI 绑定给出完整工程实现,覆盖内存共享模型、事件同步、NVLink 拓扑感知、错误处理与 NCCL 集成。